自然語言處理的演進:從碎片化人工智慧到基礎模型
定義
- 碎片化人工智慧:一個以離散、專門的神經網路架構為特徵的時代,這些架構專為序列標註或分類等個別任務所設計。
- 基礎模型:一種統一的、單體式 Transformer 架構,將所有語言問題都視為生成式的文字到文字序列 $x \rightarrow y$。
核心概念
- 架構整合: 在歷史上,自然語言處理需要量身打造的管線(NER 用 Bi-LSTM,情感分析用 CNN)。大型語言模型將這些孤島式架構整合為單一主幹,同一組權重適用於所有任務。
- 統一介面: 大型語言模型以自然語言介面取代專門的「輸出層」(例如三類 Softmax)。輸入和輸出始終是字串,讓模型能理解 意圖 而非 格式。
- 知識遷移: 傳統模型對每個任務都是「白紙狀態」。大型語言模型則優先重視 泛化優先,其中特定任務只是既有、穩健之語言內部表徵的應用而已。
歷史脈絡
- 2018 年之前: 任務隔離要求以不同的損失函數 $\mathcal{L}_{task}$ 訓練各自的模型。
- 現代: 「文字到文字」典範讓單一模型(例如 Llama-3)能夠透過零樣本或少樣本提示來切換任務。
Python 實作比較
